MedScope: A Lightweight Benchmark of Open-Source Large Language Models for Medical Question Answering
이 논문은 MedMCQA 의 1,000 개 질문을 기반으로 LLaMA, Qwen, Gemma 계열의 경량 오픈소스 LLM 들을 정확도, 효율성, 일관성 등 다각적 지표로 평가하는 경량 벤치마크 프레임워크 'MedScope'를 제안하고, 현재 모델들의 성능 편차와 고위험 의료 환경 단독 배포의 한계를 규명했습니다.